强化学习基础:从 MDP 到 Value Function 强化学习(Reinforcement Learning, RL)研究的是一类典型的 序贯决策(Sequential Decision Making) 问题。 与监督学习中“给定输入 $x$,预测标签 $y$”的学习范式不同,强化学习所关心的并不是一次孤立的预测,而是: 一个智能体应该如何在不断变化的环境中连续做出决策… 2026年9月1日 #Reinforcement Learning#Machine Learning#Deep Learning